起始位置 θ=0,有三道題可選:最接近這個位置的 A,還是鑑別參數較大的 B?Day 19 的題目資訊量讓這個選擇可以計算。今天示範電腦化適性測驗(CAT)的第一題選擇、一次作答後的估計更新,以及第二題選擇。完整系統還要處理題庫校準、內容、曝光與停止條件,不能從這幾步就宣稱已建成。
本篇沿用 ENGAGE-v1 題意,設計教學用的二分題庫例子;A、B、C 是本例的題目代號,參數是供手算使用的指定值,並非本輪校準得到的估計結果。它們也不表示原本五點題可以直接不經處理地套入二分模型。
校準題庫 → 起始規則 → 選題規則 → 作答
↓ |
內容/曝光 ← 更新 θ
↓
停止規則
圖的用途是避免把「選下一題」當成完整系統。它不能證明題庫(item bank)已校準,也不能評估真實學生的測驗體驗。
| 層 | 簡化 CAT |
|---|---|
| 資料機制 | 2PL 下依 θ 與 item parameters 產生反應,作答序列由演算法適性選擇 |
| 目標 | person θ 與其不確定性,在內容約束下用較少題估計 |
| 假設 | item calibration 可用、local independence、model fit、選題/停止規則與用途適切 |
| 可觀察量 | 已作答 items、responses、calibrated a/b、內容標籤與曝光紀錄 |
| 決策規則 | 起始 θ、最大 information 或其他準則、ML/MAP/EAP 更新、precision/length stop |
| 保證/限制 | 模型與演算法下集中測量資訊;不保證公平、內容完整或真實場域省題比例 |
假設起始 θ=0,題庫有三個二分題目(item):
| item | a | b | P(θ=0) | I(θ=0) |
|---|---|---|---|---|
| A | 1.0 | 0.0 | .500 | .250 |
| B | 1.5 | 0.5 | .321 | 約 .490 |
| C | 0.8 | -1.0 | .690 | 約 .137 |
依 2PL information,B 在目前位置最大,因此先選 B。表格的計算可由 Day 19 公式重做;它只展示 statistical criterion,沒有放內容與曝光限制。
假設作答為 1。為避免第一次全對造成 maximum-likelihood estimate 往極端跑,我用一個教學用粗糙 EAP grid:θ 只取 -1,0,1,先驗權重暫設相同。B 在三點的 success probabilities 約 .095,.321,.679,乘相同 prior(先驗分布)後正規化為約 .087,.293,.620,posterior mean(後驗分布)約 0.533。這不是正式 CAT 精度,只讓更新步驟可手算。
接著在 θ=.533 重算未作答 A、C 的 information。A 在中心附近仍約 .233,C 因位置遠離 b 而更低,所以選 A。若 A 作答 0,posterior 會往下調;系統不是把第一次成功永久鎖成高能力。
停止規則也需先定義。教學例可設「至少 3 題且 posterior SD 小於某門檻」;真實用途要由可接受誤差、題庫大小、內容涵蓋與測驗時間共同決定。只用 fixed length,可能對某些 θ 太精確、另一些不足;只用 precision,又可能造成長度差異與題庫曝光。
請 Claude 從題目表選題時,只回答 B 還不足以驗收。每步應列出目前 θ、可選題目、內容限制、各題資訊量、選題、反應、更新方法、新估計、不確定性與停止判定。教師才能逐列重算,分辨它是依規則選題,還是只猜中了答案。本篇表格先展示第一步,未填出的後續欄位仍屬設計要求。
粗格點更新有一個適合手算的錯誤案例:直接平均三個反應機率,卻沒有先把先驗乘以反應概似,再正規化成後驗權重。上面的 .087,.293,.620 應加總為 1,然後與 θ 格點相乘才能求後驗平均。這裡展示驗算方法;原稿未附模型對話,不能將這個錯誤當成本輪實測紀錄。
若 BE 題在 θ=0 周圍普遍比 EE、CE 題 information 高,純 max-information CAT 可能連續選 BE,最後精確估到一個內容偏窄的 engagement。加入 content balancing 後,選題不再只由 information 排名;eligible pool 先受構念配額與先前作答限制。
另一個 failure case(失敗案例)是題目曝光。每位作答者在相近 θ 都看到同一高資訊題,題目很快外洩,也會破壞安全與校準。隨機化、曝光上限或 shadow testing 等方法可處理,但超出本篇實作。文章只把它列為真實部署不可省略的層。
第三個反例是用同一批適性資料不加選題機制就重新校準。因作答反應(response)的觀察取決於先前選題,missing-by-design 需要在模型與估計中正確處理;不能把未作答都當 0。
起始 θ 固定為 0 很簡單,但對極端位置的作答者,前幾題可能太難或太易;使用 routing 題目、背景 prior 或多階段設計,則引入新的公平與隱私問題。背景資料若與敏感群體高度相關,不能只因提升效率就放入 prior。起始規則要能向使用者說明,也要測試不同群體的影響。
停止門檻同樣不是純技術值。若 posterior SD 低於 .30 才停,需說明此精度如何連到分數用途(score use);若題庫某 θ 區域資訊不足,演算法可能一直出題仍無法達標。系統應有 maximum length 與「未達 precision」狀態,不能在上限時假裝正常完成。
逐步紀錄還需設計三種失敗輸出:no-eligible-item、max-length-without-precision、estimate-at-boundary,分別表示無題可選、已達題數上限但精度不足、估計碰到邊界。這些狀態目前是介面規格,沒有在本文跑出完整測試軌跡。真正實作時,也要決定如何向教師與受測者說明,避免將系統限制誤說成個人缺陷。
教學模擬會固定 item-bank version、seed(隨機種子)、θ grid、作答反應生成器、selection rule、estimator(估計方法)與 stop rule。它也保存每位合成作答者的 trace(執行軌跡)。比較 fixed form 與 CAT 時,至少看 bias、RMSE、coverage、length distribution、content coverage 與 exposure;只報平均少幾題,可能掩蓋極端 θ 或群體的失敗。
即使模擬顯示 CAT 在生成模型下較省題,也只能標為 simulation observed。真實題目會有內容、動機、速度、學習與安全問題,模型(model) parameters 也非已知真值。模擬是系統驗收探針,不是部署效益證明。
最後,CAT 的每一步都要可稽核:為何這題 eligible、為何被選、估計如何更新、何時停止。若商用系統只回傳最後 θ,教師無法判斷內容失衡或參數版本錯置。適性不應成為不可檢查的同義詞。
兩者都依目前狀態選下一個資訊單元,但教科書不能把題目資訊量(item information)公式直接套成閱讀推薦。教師學習的目標多維、先備會改變,文章也有內容依賴;所以本系列只借用「狀態—選擇—更新—停止」結構,不聲稱建立了教育 CAT。
原問題的答案是:題目資訊量能支援局部選題,但完整 CAT 還要管理估計、內容、曝光與停止。發展閱讀是 Lord 的 tailored testing 與 mirt(R 的試題反應理論套件);前沿閱讀可進 shadow testing、online calibration、multidimensional CAT 與 fairness(公平性)。
本篇實際算到:在 θ=0 選 B、收到反應 1 後得到粗格點後驗平均約 .533,再選 A。尚未給定 A 的實際反應、完成第三題或計算停止判定,所以這不是完整的三題 CAT 紀錄。下一篇會把這些公式拆成符號、邏輯、數值三層,檢查流暢解釋是否真的支持計算。